iT邦幫忙

2026 iThome 鐵人賽

DAY 16
0
AI Engineering

AI 開發雜記:Skill、CLAUDE.md、Memory 這些你可能忽略的細節系列 第 16

Day 16:案例——某類規則從「每次人工複查都漏」到寫成自動化檢查工具的過程

  • 分享至 

  • xImage
  •  

前言:明明每次都有檢查,為什麼還是漏掉?

「我們每次發文前都會請人再看一遍,怎麼還是會漏掉不該出現的東西?」

這是很多團隊在導入某種內容規範(不管是去識別化、格式規範、還是某種命名慣例)之後,遲早會問出來的問題。答案往往不是「複查的人不夠認真」,而是這一類問題本身,不符合人腦掃視時會自然注意到的模式——今天用一個具體案例,走一次「某類規則從靠人工每次都漏,到寫成自動化檢查工具」的完整過程。

今日目標

  • 理解為什麼某些型態的問題,人工複查會系統性地漏掉,不是複查的人不用心
  • 看懂第一次跑自動化檢查工具,抓到人工從沒發現過的問題,這個轉折點是怎麼發生的
  • 認識把規則寫成 script 之後,怎麼讓它持續累積、變得越來越完整
  • 完整回顧第二部(Day 8-16):記憶系統怎麼設計

症狀:規則寫清楚了,人也複查了,還是漏

情境是這樣:一個團隊訂了一條規則——所有要對外發布的內容,不能出現某一類特定格式的識別字串(可能是內部代號、可能是某種命名模式)。這條規則寫進了流程文件,每次發布前也確實有人會重讀一遍內容。

但問題還是持續發生:漏掉的不是那種一眼就能看出來的明顯案例,而是藏在一長串正常敘述中間、格式上跟周圍文字很像、讀起來完全不突兀的那種。複查的人不是不認真,是人在閱讀大段文字時,注意力會自然被「語意」牽著走——讀者在乎的是「這句話講不講得通」,而不是「這個詞的格式符不符合某個規則」,這兩件事需要的注意力模式完全不同。

為什麼這一類問題人工複查會系統性地漏掉

人工複查依賴的是「這裡感覺怪怪的」這種直覺,但某些問題的設計就是不會讓人產生這種直覺——它們讀起來完全通順,甚至讓內容看起來更具體、更可信,複查的人反而更不會多想。這正是最危險的地方:越是讀起來自然的識別資訊,越容易被複查漏掉,因為它沒有觸發任何「這裡需要多看一眼」的訊號。

這跟「這句話語意通不通」是兩個完全獨立的判斷維度:一句話可以語意完全通順,同時又命中了不該出現的格式規則。人腦在閱讀時預設是做前者的判斷,不會主動切換到後者,除非刻意訓練自己用另一種方式重新掃過一遍——而這種刻意切換,正是最容易被跳過的一步,尤其是在時間壓力下,或是已經讀過同一份規則很多次、注意力早就鈍化的情況下。

轉折點:第一次跑自動化工具,抓到了什麼

有人提議:既然這類問題的判斷標準是明確的(符合某種格式、符合某個已知清單),那就不該靠人工每次重新判斷,該寫成一支可以直接執行的檢查工具——把「這個字串符不符合某種已知的識別格式」這件事,變成程式碼可以窮舉比對的問題,而不是靠人一段一段讀過去判斷。

工具寫出來、第一次拿去掃過去已經發布過、也已經被人工複查過好幾輪的內容,結果立刻抓到一個先前所有複查都沒抓到的案例——不是因為那個案例特別隱蔽,而是因為它剛好符合前面講的那個特徵:語意通順、格式上不突兀,人工複查的注意力自然被語意帶走了。

用一組對照來看這個差異:

❌ 只靠人工複查,依賴「感覺哪裡怪怪的」:
複查者讀完整段內容,判斷「讀起來很正常,沒問題」
→ 判斷依據是語意通不通,
  但識別資訊的問題根本不在語意層次,
  複查者的注意力從一開始就被引導去判斷錯的東西

✅ 明確判斷標準寫成工具,人工複查退居第二關:
先跑自動化工具,掃出所有符合已知格式的候選項目,
再由人工針對這份候選清單逐一確認要不要修改
→ 判斷標準從「讀起來順不順」換成「符不符合已知格式」,
  工具負責窮舉比對,人負責判斷候選項目裡哪些是真的要改

這正是這個系列反覆講的模式:不是要求人變得更細心、更有經驗,而是把判斷標準從「依賴直覺」收斂成「可以被程式邏輯窮舉比對」的具體規則。 人工複查不會消失,但角色從「第一線的偵測器」變成「候選清單的最終判斷者」——這兩個角色需要的能力完全不同,前者容易疲勞、容易被語意帶偏,後者則是人真正擅長的:對著已經篩選過的候選項目,做需要理解上下文的判斷。

讓工具持續累積,而不是停在第一版

這支工具寫出來的第一版,只涵蓋了團隊當下已知的識別格式。後續每次發現一個新的、工具還抓不到的案例,就把對應的規則加進工具的判斷清單——工具本身不是一次寫完就結束,而是隨著實際踩過的坑持續變得更完整。這也呼應了 Day 15 講過的分界:工具負責窮舉比對、持續累積規則庫,人負責判斷候選清單裡哪些是真的問題、要怎麼改。

第二部回顧:記憶系統怎麼設計

第二部(Day 8-16)從記憶系統的四種類型(Day 8)開始,講到 feedback 記憶怎麼從被糾正變成規則(Day 9-10)、記憶會過期的風險與怎麼設計驗證紀律(Day 11-12)、CLAUDE.md/Skill/Memory 三層分工(Day 13-14),最後收在把機械式檢查寫成可執行工具(Day 15-16)。這幾天想傳達的核心是同一件事的不同樣貌:讓 AI(或人)依賴的判斷依據,從「記性」「直覺」這種容易失效的東西,換成「可以被明確驗證、可以持續累積」的具體機制。

今日思考題

回想你的團隊有沒有一條「每次都有複查,但還是偶爾會漏」的規則?那類漏掉的案例,有沒有一個共同特徵——是不是都剛好符合「讀起來很自然,不會引起注意」這個模式?

今日重點回顧

  • 某些型態的問題會被人工複查系統性地漏掉,不是因為不用心,是因為人腦閱讀時的注意力模式跟這類問題的判斷標準不在同一個維度上
  • 越是讀起來自然、語意通順的識別資訊,越容易被複查漏掉,因為它不會觸發「這裡需要多看一眼」的訊號
  • 把判斷標準明確的規則寫成自動化工具,能讓判斷依據從「感覺哪裡怪怪的」換成「符不符合已知格式」
  • 工具負責窮舉比對、持續累積規則庫,人負責針對候選清單做最終判斷,兩者分工不是取代關係
  • 第二部整體在講:把判斷依據從依賴記性/直覺,換成可以被驗證、可以持續累積的具體機制

明日預告

明天要進入第三部:多 Agent 協作的坑。第一篇要講「為什麼要委派給獨立 agent」——這件事其實不只是「分工」這麼簡單。


上一篇
Day 15:Skill 附帶可執行工具(script):把機械式檢查自動化
下一篇
Day 17:為什麼要委派給獨立 agent——不是「分工」這麼簡單
系列文
AI 開發雜記:Skill、CLAUDE.md、Memory 這些你可能忽略的細節21
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言